圖/本報資料庫
科技生活

·a few seconds ago·葉安庭
#Google#Gemini#人工智慧#語音助理#AI模型
圖/本報資料庫
圖/本報資料庫
商傳媒|葉安庭/綜合外電報導
摘要

Google今日發布全新Gemini 3.8 Live系列AI語音模型,分為專注於流暢對話的3.8 Live,以及具備進階多步驟推理能力的3.8 Live Extended Thinking,兩者皆支援即時語音互動與背景任務處理,目標是使人機語音對話更自然、智慧。

Google 今日宣布推出兩款專為語音互動設計的最新人工智慧(AI)模型:「Gemini 3.8 Live」與「Gemini 3.8 Live Extended Thinking」。這些模型旨在使人機語音對話更自然、流暢且智慧,並能處理複雜任務。

Gemini 3.8 Live:流暢對話與成本效益

Gemini 3.8 Live 是一款針對語音互動優化,並強調規模與成本效益的 AI 模型。它結合了對話智慧、流暢對話能力,以及根據視覺資訊回應的特性。例如,該模型能近乎即時地處理來自攝影機等視覺輸入,為對話增添情境,並在對話中自動偵測或切換 97 種支援語言。此外,Gemini 3.8 Live 可以在背景執行工具與應用程式介面(API)呼叫,同時保持對話進行,無需用戶等待處理完成。在衡量語音互動效能的「Speech Agent Arena」使用者評分中,Gemini 3.8 Live 獲得第二名。

Gemini 3.8 Live Extended Thinking:進階推理與同步處理

與此同時推出的 Gemini 3.8 Live Extended Thinking 則更進一步,具備更強大的推理與多步驟處理能力,以應對更複雜的任務。該模型能夠同時進行推理和語音回應,在處理複雜任務時,對話不會中斷。例如,它能以「讓我查一下」等自然語句回應,並在背景執行多步驟任務時,以對話方式說明進度。在 Artificial Analysis 的「Speech to Speech Quality Index」語音互動品質評測中,Gemini 3.8 Live Extended Thinking 以 82.6 分奪得總體第一。不過,在金融機構的「τ-Voice-banking」基準測試中,該模型僅獲得 35.1% 的完成率,顯示其在複雜的金融情境中仍有改進空間。

廣泛應用與技術細節

Google 表示,這兩款新模型正透過多種管道推出,包括 Gemini API、Google Workspace 以及 Gemini 應用程式。例如,在 Google Workspace 中,Google 文件、Gmail 和 Google Keep 等語音互動功能已能透過語音處理複雜任務,而 Google搜尋服務則透過 Search Live 利用 Gemini 3.8 Live Extended Thinking 提供即時逐步指導。此外,Google 也正在加強 Gemini Notebook 筆記應用程式的 AI 學習工具,導入即時語音對話、互動式學習總覽、擴增測驗格式、錄音及短片等功能,使其成為更具互動性的學習環境。

為確保內容安全與可追溯性,所有由 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 生成的音訊都將帶有 Google DeepMind 的 SynthID 浮水印。這項技術旨在讓偵測工具識別由 AI 生成的語音,有助於應對語音複製在詐騙和假資訊方面帶來的風險。

市場競爭與未來展望

目前,開發人員可透過 Gemini API 和 Google AI Studio 使用這兩款新模型。企業用戶則可透過 Gemini Enterprise 進行私人預覽。Google 也指出,此次發布距離前次重要更新僅約兩週,顯示其正以更快的發布速度應對市場競爭。然而,與競爭對手 OpenAI 的 Realtime API(基於 GPT-4o)和亞馬遜的 Nova Sonic 不同,Google 尚未公布 Gemini 3.8 Live 和 Extended Thinking 的每分鐘使用費用,這對開發者在預算規劃上仍構成挑戰。